AiNews
⚡ 速览 🧠 模型
← 返回首页

#multi-task learning

包含标签 "multi-task learning" 的文章,共 1 篇。

🧠 模型动态 Reddit

一编码器七头:统一安全分类器训练经验

该项目旨在将七个独立的安全序列分类器整合为一个统一的多头模型,命名为“apex模型”,其训练权重现已公开。这一整合旨在提高效率并简化维护。 模型的核心架构是一个共享的`mmBERT-small`编码器,连接七个不同的任务头,包括二进制注入检测、文档类别识别、工具类型、工具操作、工具数据流标签、意图路由和威胁类型分类。 在训练过程中,团队总结了多项关键经验。首先,**掩码损失(Masked Losses)**被证明至关重要。它仅对有真实标签的任务计算损失,有效避免了因标签稀疏性导致的“损失饥饿”问题,确保了所有任务的有效学习。其次,**损失加权(Loss Weighting)**策略对模型性能影响显著。在尝试了等权重和逆频率加权后,团队发现基于不确定性的动态加权方法(参考“Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics”论文)效果最佳,能够根据任务的不确定性动态调整权重。此外,实验表明,简单的线性层足以作为任务头,而`mmBERT-small`编码器已能满足需求,无需采用更大的编码器模型。 最终,这个统一的多头模型在性能上与独立的分类器相当甚至更优,同时显著提升了效率,包括降低维护成本、加快推理速度和减少内存占用。对于中国开发者和AI创业者而言,该项目不仅提供了一个可复用的安全分类器,更展示了在多任务学习中有效利用掩码损失和不确定性加权等策略的巨大潜力,为构建高效、通用的AI安全解决方案提供了宝贵的实践经验和技术参考。